Efficient Estimation of Word Representations in Vector Space (2013 论文)
概述
Mikolov 等人于2013年发表的《Efficient Estimation of Word Representations in Vector Space》,提出了 Word2Vec 模型,开创了词嵌入时代,将语义推理转化为向量算术。
关键内容
论文信息
| 条目 | 内容 |
|---|---|
| 标题 | Efficient Estimation of Word Representations in Vector Space |
| 作者 | Tomas Mikolov, Kai Chen, Greg Corrado, Jeffrey Dean |
| 发表时间 | 2013年 |
| 会议 | ICLR Workshop |
| 机构 |
核心创新
- Skip-gram 架构:用中心词预测上下文窗口内的词,对低频词效果尤佳
- CBOW(连续词袋模型) 架构:用上下文词的平均向量预测中心词,训练更快
- 负采样(Negative Sampling):用 K 个随机负样本代替全量 Softmax,速度提升 1000 倍以上
- 高频词下采样:丢弃概率 P(wᵢ) = 1 - √(t / freq(wᵢ)),减少无信息高频词影响
语义发现
训练后的 300 维向量空间展现出惊人的线性语义关系: - king - man + woman ≈ queen(性别类比) - Paris - France + Italy ≈ Rome(国家-首都关系) - walked - walk + swim ≈ swam(动词时态变化)
工程效率
历史影响
- 开创了 词嵌入(Word Embedding) 时代
- 成为 NLP 预训练-微调范式的先驱
- 直接启发了 GloVe(2014)、FastText(2016)、ELMo(2018)、BERT(2018)等后续模型
来源
- raw/articles/ai-papers/machine-learning/08_word2vec_2013.md
相关
- Tomas Mikolov — 第一作者
- Word2Vec — 提出的模型
- Skip-gram — 提出的架构
- CBOW(连续词袋模型) — 提出的架构
- 负采样(Negative Sampling) — 提出的训练方法
- 词嵌入(Word Embedding) — 实现的技术